Dans les modules précédents, nous avons utilisé les approximations de fonctions dans le cadre des méthodes on-policy (méthodes en ligne). Nous allons ici traiter les méthodes off-policy (méthodes hors ligne).
Rappelons que dans le cadre des méthodes d'apprentissage de type off-policy, nous cherchons à apprendre une fonction des valeurs des états et des actions d'une stratégie cible $\pi$ à partir de données récoltées par l'agent en suivant une stratégie d'exploration $b$ (stratégie comportementale). Lors de l'estimation des fonctions des valeurs des états $\hat v \approx {v_\pi }$ et des actions $\hat q \approx {q_\pi }$, les deux stratégies sont statiques et connues alors que lors de l'optimisation de la stratégie cible $\pi$ les deux stratégies change pendant l'apprentissage. La stratégie cible $\pi$ est de type greedy par rapport aux valeurs des actions $\hat q$ et la stratégie comportementale $b$ est de type $ϵ$-greedy ou $ϵ$-soft.
Les méthodes off-policy développées dans le cadre des environnements avec un nombre fini d'états que nous avons vu dans la formation d'initiation à l'apprentissage par renforcement sont applicables avec les algorithmes du semi-gradient, mais leur convergence n'est pas aussi robuste que dans le cadre des méthodes on-policy. Nous allons dans ce module étudier ces problèmes de convergence.
La difficulté de l'apprentissage de type off-policy peut être divisée en deux parties:
La première difficulté est associée aux cas tabulaires (environnements avec un nombre d'états finis). Ici, ce sont les mises à jour des cibles qui doivent être adaptées lorsque les données proviennent de la stratégie comportementale. On a utilisé pour cela la méthode d'échantillonnage préférentiel, qui peut malheureusement augmenter la variance mais est indispensable pour avoir des algorithmes fonctionnels.
La seconde difficulté n'est présente que lors de l'utilisation des fonctions d'approximation. Ici, l'échantillonnage préférentiel est également requis mais c'est la distribution des mises à jour qui va apporter une nouvelle problématique. Celle-ci n'est pas en accord avec les conditions de stabilités requises que l'on trouve dans les méthodes on-policy.
Deux approches ont été étudiées pour traiter ce problème: